HN
Hacker News • 29일 전
IMP 7
터미널벤치-사이언스: 과학 연구 워크플로에서 AI 에이전트 평가
스탠퍼드 대학 연구진이 주도하고 Terminal-Bench 팀이 개발한 'Terminal-Bench-Science'는 실제 과학자들의 연구 워크플로를 기반으로 AI 에이전트의 과학적 역량을 평가하는 벤치마크입니다. 첫 버전(0.1)은 생명·물리·지구·수학·공학 분야의 70개 과제를 포함하며, 가장 성능이 좋았던 Claude Opus 5의 해결률은 30%에 그쳤습니다. 이 벤치마크는 모델 개발사가 아닌 과학자들이 기준을 설정하고, 최신 AI 발전에 맞춰 지속적으로 진화하는 것이 특징입니다.
벤치마크 AI 에이전트 과학 연구